
邬江兴
中国工程院院士
非常荣幸参加这次闭门会议,我的演讲题目是“破解AI产品可信可用质量检测世界难题”。
AI是中美战略竞争决战决胜高地。兰德公司已指出,最终决定胜负的关键在于AI规模化渗透应用。规模化渗透应用是中国的强项,但如果安全无法保障,那么泛量化应用就兜不住我们在中美AI竞争中不能输的底线。一旦大规模应用后出现安全问题,可能会带来灭顶之灾。因此,如何在保持我国应用领先优势的前提下,构建中国在AI安全治理中的全球话语权,变得非常重要。
前不久的“小龙虾”智能体规模化应用,为AI产品质量检测带来了新挑战。这不仅涉及传统的网络安全问题,还包含大模型自身内部的安全问题。Open Claw风险揭示出AI产品的安全风险同时来自外部注入与内生失控,跨越功能安全与AI安全边界,现有检测体系在面对“无攻击方的内生失控”时几乎完全失效。这种风险就像人体内的癌症,不是外界传染来的,而是自身产生的。
如何突破大规模应用的“安全信任壁垒”,是目前关注的焦点。从大众用户角度,痛点是AI到底有多安全,即在AI医疗、自动驾驶以及金融等领域信任机制是否存在、用户敢不敢用,需要的是一颗“定心丸”。从关键行业角度,无论金融、电力还是政务领域,痛点在于AI犯错时会对业务造成多大影响,以及责任如何界定,其需求是一张“通行证”。从政府监管角度,痛点在于AI产品安全如何衡量、监管和处置,需要一个抓手、一把“标尺”。因此,如何建立权威的AI产品安全评测与认证机制,如何建立一套有公信力的安全质量评测标准,就变得十分关键。同时,区块链也存在很严重的内生安全问题。所以,如何让政府监管有据可依,让企业责任清晰,让用户放心使用,是目前的挑战所在。
AI产品安全面临的第一性问题是AI技术不确定的安全边界。这一不确定性的来源,既有网络空间现有的内生安全共性问题,也有内生安全个性化问题。训练数据的统计学本质导致“幻觉”无法根除,大模型输出是“概率性选择生成”,安全边界必然不确定。因此,一套能够系统检测AI安全边界的理论范式和工程技术解决方案,已成为学术界和产业界高度关注的问题。
如何从不确定性,过渡到可信可用、敢信敢用且具有相对可靠性的安全质量检测体系,这个过程需要我们引入一些颠覆性思路,在不确定性的LLM系统基础上建立概率可控、可信、可用的检测与监督体系。人工智能产品的概率性输出与行为涌现所带来的测不准、测不全、难评估的难题,凸显了构建新型检测与监督体系的现实紧迫性与理论必要性。而从理论到工具再到使用安全可信的质量检测与干预体系均存在缺失,是当前面临的核心挑战。
现有检测方案在面对AI内生不确定性场景时存在检测盲区。例如安全风洞,通过构建固定、可控的模型环境,对目标系统的已知风险进行重复性与量化性测试,但问题在于场景固化与AI产品动态风险难以匹配,导致未知风险测不全。而红蓝对抗是一种较为传统的网络安全对抗方式,用以检验系统的安全防御功能。再比如利用测试靶场,为金融系统构建高度仿真的攻防环境,为安全团队提供实战化攻防演练平台。然而,这些测试均基于明确的攻击方与防御方之间的对抗。但AI产品风险大多来源于无攻击方的内生性失效,因此现有LLM模型检测方法不仅难以应对人为攻击的影响,更无法应对其内生的安全威胁(幻觉),尤其是产品生命周期内的未知风险长尾分布的场景。如果不进行较大变革,现有体系难以支撑AI规模化渗透应用。
我们目前面临的问题是如何将AI产品的不确定性风险转化为相对确定的、可量化的检测指标。AI产品的本质特点是输出为“概率性选择生成”,而非“确定性逻辑推导”。作为全球网络安全、内生安全学派的创始人,我在思考能否应用原创的内生安全理论和方法,来破解网络空间的不确定性危险?这一机制能否解决问题、打破困局?也就是说,人工智能产品的安全质量检测需要走一条新路径。
因此,破局关键在于研究“不确定性的普遍性与确定性的相对性”之间的关系。我们要提出一个问题:是否存在不依赖先验知识的防御范式?换言之,如何在确定性与不确定性之间导入相对正确的关系。这一相对正确关系最早起源于孔多塞陪审团定理。其核心含义是:如果群体中每个个体独立判断,且个体判断正确的概率大于0.5(即优于随机性参照),那么随着群体规模扩大,多数投票决策正确的概率会无限趋近于1;反之,若概率小于0.5,则群体规模越大,决策错误的概率越接近于1;若概率等于0.5,群体决策的正确概率始终等于个体,无法通过群体提升准确性。这就是目前法律程序上陪审团机制的科学依据。
基于这一科学依据,可以得出一个数学结论:群体决策的正确概率,即至少超过一半成员判断正确时,则群体决策正确。因此,群体决策可以显著提升系统的可靠性。理论证明,通过多个异构模型进行裁决,可以显著降低系统整体错误概率。区块链的基因缺陷在于没有强调个体的异构性。如果区块链个体及底层都是同构的,例如都使用Linux或UNIX,那么再多的51%都是无用的。基于孔多塞陪审团定理,可以推导出一个“相对正确公理”的结论,其通俗表达是:“人人都存在这样或那样的缺点,但极少出现独立完成同一任务时,多数人在同一地点、同一时间犯完全一样错误的概率。”由此推导出的数学公理,也就是现行选举制度的逻辑表达。为什么多数表决或相对性表决能够实现有效控制?假设有三位刚从警校毕业的交警,他们懂交通规则但缺乏驾驶经验;另一方是一位拥有全天候驾驶经验和数十万公里驾驶履历的老司机,可视为一个强模型。如何判定老司机是否存在问题?传统思路是用更强的模型来监管强模型,就像用比被测对象精度更高的仪表进行测试。但在人工智能环境下,这种思路难以实现。
因此,传统的检测模式需要转换思路:用多个弱模型协同解决问题。具体路径包括能力解耦、规则判定,拆解风险、映射规则,异构协同、集体决策。其关键原理是将能力维度与规则判定维度解耦。大模型的能力可以自由发挥,但要接受严格规则判定。通过规则映射、异构协同提高AI安全检测可靠性,即用一组弱但专业的模型进行协同监管,实现“以专克强、以多胜大”。
内生安全已完成信息论、控制论、博弈论、系统论等多重科学机理证明,数学上的理论证伪也已完成,其可行性与科学性不容置疑。内生安全检测能够优于当前任何基于先验知识的大模型检测方法,其内在机理是相对性检测,即用异构弱模型的群体搭建检测主体构造,用价值对齐与归一化创建检测约束条件,通过基线对比与阈值裁决调节测评控制流程,形成动态闭环与负反馈,建立AI产品“检测-反馈-优化”的完整质量检测链条。
异构弱模型群体“强规”判识技术体系,在绝大多数场景下的核心是“法无允许即禁止”。通过理论证明与实验验证,可以构建基于群体一致性分析的安全检测新范式,提出利用异构弱模型对强模型进行群体裁决的AI产品内生安全检测方法,并从理论上证明AI产品安全边界的存在性。区块链本质上也是一种异构群体检测,其机理与内生安全机理完全一致,但在异构度上存在不足。
异构弱模型群体判识数学原理表明,通过多数裁决机制,安全边界的相对性量化表征是可以控制的。从模型分析来看,AI内生安全质量检测的机理是:一个被检测的大模型可能包含数百亿到数千亿参数,而若干个小模型(几个到百亿参数以内)如同“三个臭皮匠”来判定“诸葛亮”的行为是否正确。按照这一方法,假设判别模型之间相互独立,判决错误概率分别满足相应条件,利用中心极限定理可以证明:若单个判决模型的平均错误率小于0.5,则监督集群的错误率随个体数量增加呈指数下降。这是我们在全球的首次发现。OpenAI近期的研究也表明,利用性能较弱的模型可以为更强的模型提供有效监督。国外相关理论也支撑这一观点。2025年,麻省理工学院团队指出,弱AI监督强AI已被提出作为控制未来超智能系统的关键策略,但如何实现规模化应用仍不明确。欧盟亦有类似研究,强调高风险AI需提供“人在回路”,在技术可行的情况下,在高风险人工智能系统投放市场或投入使用前,要确定并内置监督措施。
我们在自动驾驶中采用弱模型检测强模型的方法,已于2025年完成实况验证。结果表明,智能决策可以不再依赖单一的端到端黑箱模型,而是可以依靠多主体共识机制确保决策与行动的可控性。这为大模型上车提供了安全可信的路径。弱模型监督自动驾驶AI产品的内生安全检测原理验证已初步完成,为自动驾驶产业规模化应用提供可行路径。同时,我们在上海东方有线的应用中,发现智能体“东东”上线后出现诸多问题。如何在发挥AI智能体性能与用途的同时减少风险?于是我们在人工智能电视中导入了模糊共识机制下的智能体输出异常检测场景,并达到了理想效果。
总结来看,内生安全质量检测的总体技术方案已经提出,其核心包括规则与共识生成(在人类主导下可独立“贯入”检测平台)、检测构件(AI体检通用装置)以及安全隔离床。关于区块链,我们认为其当前最大弱点在于基础设施的内生安全问题。人工智能内生安全质量检测场景可适用于智能体产品、智能终端产品、智能平台产品、大模型产品以及数据要素产品。内生安全质量检测产业链可分为上游、中游、下游,其开源发展的当前阶段为原理验证。第一阶段为自主研发,预计今年能够完成;第二阶段为代表性行业的开源验证;第三阶段就可以为千行百业开源赋能。因此要统一设计侧与使用侧的诉求,支撑规模化应用的快速迭代。
我们认为,整个AI的发展应遵循一个逻辑闭环:首先是焦虑唤醒,即“养虎遗患”,大家意识到AI可能存在风险;其次是信息传递,实现风险可控;随后是行动号召,把好安全质量关;最终形成共同愿景,即安全可信的规模化应用。这一过程呈现为双螺旋结构:蓝色螺旋代表能力的持续进化,绿色螺旋则代表更安全,可量化设计、可动态调整。无论AGI的发展路线如何,“可信可用”是底层逻辑,实现AI功能、性能与安全可信的双螺旋进化是必然结果。

谢谢大家!